Skip to content

Harness Engineering

1. 大白话:这是什么?解决什么痛点?

Harness Engineering 可以用一句非常好记的话来概括:Agent = Model + Harness。如果把大模型看成 CPU,那么 Harness 就是外面的操作系统和工作环境。模型只负责推理和生成,Harness 负责把状态、工具、反馈、执行环境和安全边界串起来,让 Agent 真的能稳定干活。

它解决的核心痛点是:很多 Agent 表现差,不是因为模型不够强,而是因为模型外侧的系统没搭好。大模型本质上只是输入输出函数,它自己记不住历史、不会跑代码、不知道有没有做对、也不会自动恢复错误。真正让 Agent 稳定、可执行、可纠偏的,往往是模型之外那套基础设施。

所以面试里可以一句话总结:Harness Engineering 研究的不是“怎么把 Prompt 写漂亮”,而是“怎么给模型搭一套能持续执行、持续校验、持续恢复的工程系统”。

2. 底层机制与高频考点

六层架构

一个成熟的 Harness 通常可以拆成六层:

  1. 信息边界层:决定 Agent 该知道什么、不该知道什么,负责目标拆解、角色定义、状态裁剪。
  2. 工具系统层:决定 Agent 怎么和外部世界交互,比如工具调用、MCP、文件系统、Web Search。
  3. 执行编排层:决定多步骤任务按什么轨道推进,不让模型胡乱跳步。
  4. 记忆与状态层:决定当前任务状态、中间产物和长期记忆怎么分层管理。
  5. 评估与观测层:决定 Agent 怎么知道自己做对了没有,比如测试、评测器、浏览器验证、日志追踪。
  6. 约束与恢复层:决定出错了怎么办,比如护栏、重试、回滚、降级、熔断。

高频对比考点

1. Harness vs Prompt Engineering vs Context Engineering

  • Prompt Engineering:解决“怎么把指令说清楚”。
  • Context Engineering:解决“每次该给模型看什么”。
  • Harness Engineering:解决“系统怎么持续执行、纠偏、观测和恢复”。

它们不是并列关系,而是一层套一层。简单任务可能 Prompt 就够了;需要外部知识时 Context 更重要;到了长链路、低容错、可执行的商业场景,Harness 才会变成主要矛盾。

2. 为什么瓶颈常常不在模型

Harness 的关键思想是:不要把 Agent 表现完全归因于模型本身。 同一个模型,换一套工具接口、反馈链路和验证回路,表现可能差出一个数量级。真正卡住系统效果的,很多时候是工具难用、反馈缺失、上下文污染、错误恢复机制薄弱,而不是模型参数不够大。

3. 上下文越多不一定越聪明

Harness 还关心长任务中的上下文污染问题。上下文不是越长越好,信息太多反而会进入“Dumb Zone”,出现幻觉增多、兜圈子、格式混乱、代码质量下降。治理手段不是无脑塞更多信息,而是做上下文压缩、渐进式披露、必要时 context reset,再用结构化交接文档保留关键状态。

4. Model-Harness 耦合

很多 Agent 产品里的模型和 Harness 是一起被调优出来的,所以模型可能“习惯”某套工具环境。面试时要能说出一个关键结论:最适合当前业务任务的 Harness,不一定是模型原厂默认那套。

3. 🎯 实战口径

在我的 [[苍穹外卖AI客服]] 项目里,我对 Harness Engineering 的理解不是额外造一个新名词,而是用它来解释为什么 Agent 不是“模型一接上就能上线”的。

我的项目里,模型只负责理解用户意图和生成结构化调用倾向,真正让系统稳定可用的是外面的 Harness:

  • 信息边界层:识别当前任务目标,不把所有历史和所有规则一股脑塞给模型。
  • 工具系统层:通过 Spring AI Tool Calling 和工具白名单控制模型能用哪些能力。
  • 执行编排层:通过 Advisor 链把意图识别、上下文注入、RAG、工具过滤按顺序串起来。
  • 记忆与状态层:区分对话级短期上下文和真正要持久化的业务记忆。
  • 评估与观测层:通过工具结果解析、日志和业务状态校验判断任务有没有真的完成。
  • 约束与恢复层:通过 SafeToolCallAdvisor 限制重复签名和最大调用轮次,防止工具死循环。

所以我会这样答辩:我的项目不是单纯在“调一个大模型”,而是在给模型搭一套 Harness。模型负责思考,Harness 负责把思考变成可控执行。真正决定 Agent 上限的,很多时候不是模型本身,而是这套外围系统有没有把上下文、工具、状态、验证和恢复机制设计好。


相关链接:[[AI Agent 核心概念]] | [[上下文工程]] | [[AI Agent 记忆系统]] | [[MCP 协议]] | [[Spring AI Advisor 链]] | [[Spring AI 安全治理]] | [[苍穹外卖AI客服]]